Operator: ELU-Affine-Gate (Fused CUDA Kernel)

Goal
- Fuse affine, ELU activation, sigmoid gate, and multiply; target ≥1.30x speedup.

Definition
- z = x * scale + bias
- m = ELU(z, alpha=1)
- g = sigmoid(alpha * m + beta)
- y = x * g
